#AI benchmark
Hermes Index 排行榜:Claude Opus 5.5 登顶 Agent 性能榜,14 个模型成本差 215 倍
Hermes Agent 官方推出了 Agent 性能排行榜 Hermes Index。这不是传统的推理 benchmark,而是模型在真实 Agent 环境中的成绩单——包含预置工作空间、真实文件、多轮对话和安全测…
Meta 发布全新大模型 Muse Spark:多模态是强项,编程是短板
今天凌晨,Meta 发布了全新的大模型 Muse Spark,已上线到 Meta 旗下的各类产品。
Meta Superintelligence Labs(MSL)负责人 Alexandr Wang 在推特上宣布了这个消息。他说,九个月前团…